【Benchmark 全部刷爆:當 AI 能力見頂,估值該怎麼算?】留言評論你嘅睇法
江山一代勝一代,GPT-6 Astra 的成績單,已經到了「無題可考」的地步。
看看這些數字:
-FrontierMath Tier 4 — 98%(業界最難的數學測試之一)
-ARC-AGI-3 — 99.9%
-ExploitBench — 100%
而且它已經協助解決了數學上長期未解的開放問題。 總裁 Greg Brockman 更表示,這最終可能被視為 AGI 的到來。
問題來了:當測試都被刷爆,投資者該用什麼標準去衡量?
這正是當前 AI 投資最尷尬的地方。
過去兩年,市場用 benchmark 分數當作進展的代理指標——分數升,估值升。 但當分數接近滿分,這個指標就失去了區分能力。
換句話說:能力的軍備競賽,可能正在逼近「衡量的天花板」,但商業回報的曲線,還遠遠落後。
該換成什麼指標? 我認為有三個更實在的:
1.企業付費採用率 — 有多少公司真的把它放進生產流程,而不只是試用
2.每項任務的成本 — 能力再強,如果單位成本下不來,就無法規模化
3.收入對算力支出的比率 — 這才是「燒錢有沒有回本」的真答案
